ComfyUI Bernini 多模态视频工作流|身份锁定视频编辑完整教程

36次阅读
没有评论

原文链接:https://www.runcomfy.com/zh-CN/comfyui-workflows/bernini-multimodal-video-generation-in-comfyui-video-edit-identity

一、工作流简介:字节 Bernini 视频编辑一站式管道

ComfyUI Bernini 多模态视频工作流|身份锁定视频编辑完整教程

Bernini完整工作流总图

本次分享的 RunComfy/Bernini-Video-Workflow 是适配 ComfyUI 的 ByteDance Bernini 专用多模态视频生成 / 编辑工作流,Workflow ID:0000…1442,完美解决 AI 视频两大痛点:人物身份漂移、画面运动闪烁

核心优势

  1. 开箱即用:完整可运行 JSON 工作流,无缺失节点、无需手动配置模型路径;
  2. 身份精准锁定:支持 1~ 多张参考图,全程保留人物五官、穿搭特征;
  3. 运动一致性:两阶段高低噪点采样 + LightX2V LoRA,镜头运镜、肢体动作不崩坏;
  4. 双输出对比:自动生成成片 MP4 + 原图 vs 成片并排对比视频,调试效率翻倍;
  5. LLM 提示词辅助:内置本地 LLM 模块,自动提取参考人物特征优化提示词。

适用场景:短视频人物替换、换装换场景、镜头风格重绘、虚拟人系列短片、广告素材二次编辑,适合短视频创作者、AI 视频工作室、算法研究者。

二、配套必备模型清单

整套工作流依赖字节 Bernini 原生模型 + Wan 视频生态组件,全部资产统一打包于Kijai/WanVideo_comfy_fp8_scaled

  1. ByteDance Bernini 高低扩散骨干 两阶段渲染核心:高噪骨干构建人物主体结构,低噪骨干细化皮肤、发丝、服装纹理,保障帧间时间一致性。 资源地址:Hugging Face ByteDance/Bernini-R
  2. Wan umT5-XXL 文本编码器 适配 Bernini 的专用文本编码,通过 CLIP 接口接入 ComfyUI,精准解析编辑指令;
  3. Wan 2.1 VAE 视频潜空间解码器,色彩匹配 Bernini 训练标准,避免画面偏色、断层;
  4. LightX2V 成对 LoRA(高噪 / 低噪双版本) 轻量化运动适配器,分别绑定高低 UNet,平衡人物相似度与动作自然度;
  5. 依赖自定义节点包
    • ComfyUI-RH-Bernini:BerniniConditioning 等专属核心节点;
    • ComfyUI-VideoHelperSuite (VHS):视频加载、帧率继承、MP4 合成全套工具;
    • llama_cpp:本地 LLM 提示词自动增强模块。

三、四大模块分步使用教程

整套工作流分为素材输入、提示词处理、LLM 提示增强、核心渲染执行四大协同模块,零基础也能按步骤操作。

模块 1:用户素材输入(基础配置)

  1. 源视频加载VHS_LoadVideo(#90)读取待编辑视频,自动继承原始帧率,保留原生运动节奏;
  2. 身份参考图LoadImage(#31)上传正面、光线均匀、中性表情的人物图,推荐 2~3 张批量输入,大幅降低身份漂移;
  3. 分辨率控制:Width(#109)/Height(#110),必须和原视频宽高比接近,否则面部拉伸变形;
  4. 负面提示预设:内置通用瑕疵抑制负面词,可自定义模糊、扭曲、闪烁、多五官等负面描述。

模块 2:提示词智能处理(身份匹配关键)

内置本地 LLM 自动解析参考图特征,解决 “提示词写不准、人物走形” 问题:

  1. llama_cpp_model_loader(#93)加载本地大模型;
  2. BatchImagesNode(#74)批量传入参考图;
  3. llama_cpp_instruct_adv(#92)自动提取人物年龄、发色、服饰、五官特征;
  4. TextConcatenate(#102)拼接「AI 提取特征 + 自定义编辑指令」;
  5. 合成文本送入 CLIP 编码,作为 Bernini 正向条件输入,预览节点可实时查看完整提示词。

模块 3:Bernini 提示增强工具(独立辅助节点)

BerniniPromptEnhancer(#60)是独立提示词生成工具,不属于主渲染链路:

  • 按任务类型(人物替换 / 场景重绘 / 换装)生成标准化系统提示词;
  • 输出结构化文案,复制到 LLM 即可一键扩写精细化指令,统一 Bernini 适配语法;
  • 来源:ComfyUI-RH-Bernini 自定义节点包内置工具。

模块 4:核心渲染执行(两阶段采样,工作流核心)

流程逻辑

加载高低 UNet → 绑定对应 LightX2V LoRA → BerniniConditioning 融合全部条件 → 分割噪声区间 → 高噪阶段建结构 → 低噪阶段磨细节 → VAE 解码 → 合成双版本视频

  1. 条件融合节点 BerniniConditioning (#34) 整套工作流核心枢纽,整合文本、VAE、原视频、参考图四大条件,生成视频潜空间:
    • length:控制生成总帧数;
    • ref_max_size:参考人物占画面小时调高,强化五官识别; 该节点为 ComfyUI-RH-Bernini 专属,无第三方替代方案。
  2. 双 LoRA 强度调节
    • LoraLoaderModelOnly(#11) 高噪LoRA:强度提高→贴合参考人物轮廓;过高动作僵硬,适合人物差异大的替换场景;
    • LoraLoaderModelOnly(#29) 低噪LoRA:控制发丝、皮肤、服装细节;帧间人脸漂移轻微拉高,纹理过锐则降低。
  3. SplitSigmas (#17) 噪声分割控制器 划分高低噪采样区间,直接决定编辑力度:
    • 分割点提前:轻度编辑,保留大量原视频画面;
    • 分割点延后:强替换效果,大幅重绘画面主体; 镜头锁定、保留原场景的编辑任务优先微调此参数。
  4. 采样器与视频输出
    • KSamplerSelect(#27):高低阶段统一采样器,减少画面闪烁;画面抖动切换偏向时间平滑的采样算法;
    • VHS_VideoCombine(#87):输出最终成片,完全继承原视频帧率;
    • 并行链路#96:自动拼接「原图 – 成片」左右对比视频,快速调试参数。

四、实操优化避坑指南

  1. 参考素材规范 优先 3 张同光线、同角度正面人像;避免侧脸、强光逆光、遮挡面部的图片;
  2. 分辨率匹配原则 生成尺寸纵横比和原视频差值不超过 10%,否则极易出现人脸拉伸、肢体扭曲;
  3. 参数调试顺序 先固定 LoRA 强度 → 调整 SplitSigmas 分割点 → 优化提示词,每次调试用对比视频观察差异;
  4. 提速小技巧 前期测试裁剪视频帧数(10~30 帧),确认人物、运动效果无误后再渲染完整长视频;
  5. 画面漂移 / 闪烁修复
    • 人脸频繁变化:提高高噪 LoRA 强度、增加参考图数量;
    • 画面频闪、纹理跳动:更换时间稳定型采样器,小幅降低低噪 LoRA 强度;
    • 背景 / 镜头偏移:正向提示词强制写明 “固定机位、背景完全不变、运镜和原图一致”,补充负面词 “镜头晃动、场景改变”。

五、资源与致谢

下载资源

  1. 工作流文件:页面可直接下载Workflow.json
  2. 模型资产:Kijai/WanVideo_comfy_fp8_scaled (Hugging Face);
  3. 项目源码:
    • ByteDance Bernini:https://github.com/bytedance/Bernini
    • ComfyUI-RH-Bernini 自定义节点:RH-RunningHub/ComfyUI-RH-Bernini
    • 视频工具套件:Kosinkadink/ComfyUI-VideoHelperSuite

致谢

本工作流基于字节跳动 Bernini 视频扩散模型、RunningHub 适配节点、Kijai FP8 轻量化模型、VideoHelperSuite 视频工具开发,所有模型、节点遵循对应开源许可证使用。

文末小结

这套 Bernini 多模态视频工作流是目前 ComfyUI 生态中兼顾人物一致性与运动流畅度的成熟视频编辑管道,两阶段采样 + 专用 LoRA 完美解决传统 V2V 视频人物崩脸、闪烁难题,自带 LLM 提示辅助、双视频对比输出大幅降低创作调试门槛,短视频、虚拟人、广告二次创作均可直接落地。

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)
验证码